Skip to content

Distributed representations of behaviour-derived object dimensions in the human visual system

Contier, Baker, Hebart (2024)

DisciplineNatural science
MethodExperiment
Tagsbehavioral dimensionsdata · experimentfmrimethod · embeddingmethod · machine learningmethod · regressionobject representationvisual cortex

Summary

Problem: 传统视觉神经科学认为视觉系统按层级处理越来越复杂的图像特征,最终在高级视觉皮层支持物体识别和分类。然而,物体视觉支持多种行为目标,这种以类别为中心的框架存在根本局限。先前提出的连续维度(如动物性、大小、宽高比)虽能部分反映类别选择性区域的活动模式,但在解释人类视觉皮层功能选择性方面远不如类别选择性。因此,需要一个更全面的框架来捕捉行为相关的物体表征。

Approach: 作者将来自大规模人类相似性判断(12,340名参与者、470万次判断)中推导出的66个行为派生对象维度,通过CLIP-ViT模型扩展到单个图像水平,然后使用fMRI编码模型将这些维度直接映射到三名参与者观看8,740张独特物体图像时的体素级脑反应上。他们比较了维度模型与类别模型对脑反应的预测能力,并分析了类别选择性区域的维度调谐稀疏性。

Finding: 行为派生维度在整个视觉皮层(包括早期视觉皮层)广泛分布地表征,而非仅限于高级视觉皮层。这些维度捕捉了已知的功能地形(如面部、身体部位、场景、工具选择性区域),同时发现了新的候选选择性模式。类别选择性区域表现出对少数维度的稀疏调谐,而非类别选择性区域则表现出混合选择性。在模型比较中,连续维度模型在预测脑反应方面优于类别模型。

Significance: 该研究提供了一个更全面的视觉处理视图,将类别选择性重新解释为多维调谐框架中稀疏响应的特例,弥合了区域专门化与全域地形之间的鸿沟。这挑战了以类别为中心的视觉组织理论,表明行为相关的连续维度可能是视觉皮层组织的更基本原则。

Theoretical Framework

N/A

Research Design

本研究为实验性研究,采用fMRI编码模型方法。分析单位为体素(voxel)。关键自变量为66个行为派生对象维度(来自相似性嵌入,通过CLIP-ViT模型扩展到8,740张图像),因变量为fMRI BOLD信号。编码模型通过加权求和预测每个体素对每张图像的响应,回归权重反映每个体素对各维度的调谐。此外,构建了包含52个类别(50个高层面类别加面部和身体部位两个额外类别)的类别模型用于模型比较。稀疏性通过编码模型权重的稀疏度测量来量化。

Data & Sample

  • fMRI数据:来自THINGS-data数据集,3名参与者(2名女性),每人观看8,740张来自720个语义类别的独特物体图像,共9,840次试验,分12个session完成。
  • 行为数据:12,340名参与者提供470万次相似性判断,用于推导66个对象维度(基于1,854个物体概念)。
  • 图像数据:THINGS数据库包含26,107张图像、1,854个物体概念。
  • 验证数据:使用一个独立的外部fMRI数据集(参考文献70)进行可重复性检验。
  • 数据来源:THINGS数据库,参与者来自德国莱比锡(Max Planck Institute)。

Analytical Strategy

  • 使用体素级fMRI编码模型,以66个对象维度作为回归变量预测BOLD信号。
  • 采用12折跨session交叉验证评估预测准确性(噪声天花板校正的R²)。
  • 通过可视化各维度的回归权重在皮层表面的分布来绘制功能地形图。
  • 使用余弦相似度将脑区调谐轮廓与26,107张图像的维度轮廓匹配,识别代表性图像。
  • 计算每个体素的编码模型权重稀疏度,比较类别选择性与非类别选择性区域的稀疏性差异。
  • 构建类别模型(52个类别)与维度模型进行方差分解比较(共享和独特方差)。
  • 在独立外部数据集上验证结果的普遍性。
  • 补充分析包括与物体形状模型的探索性比较(补充图6)。

Results & Findings

发现1:行为派生维度在整个视觉皮层广泛分布表征。 66个对象维度的编码模型预测准确性不仅在后外侧枕叶和后腹侧颞叶达到峰值,在早期视觉、背侧视觉和额叶区域也达到显著水平。这与先前基于表征相似性分析的研究(认为感知相似性信息主要限于高级视觉皮层)形成对比,表明行为相关信息在视觉处理层级中分布更广,包括最早的皮层处理阶段。三名参与者的空间分布高度相似,独立数据集也验证了这一结果。

发现2:行为派生维度反映了视觉系统的功能地形。 各维度的皮层权重图与已知的功能地形高度对应:'动物相关'维度反映动物与非动物的辐条状调谐梯度;'头部相关'和'身体部位相关'维度区分FFA/OFA(面部)和EBA(身体部位)的选择性;场景内容相关维度与PPA、MPA、OPA相关;'食物相关'维度出现在梭状回附近区域;'工具相关'维度匹配颞中回激活模式;低至中水平视觉特征维度(如'网格/光栅相关')主要反映在早期视觉皮层。此外还发现了新的地形模式,如'虫类相关/非哺乳动物/令人厌恶'维度与'动物相关'维度明显不同(缺乏面部和身体选择性区域响应),以及'薄/扁平/包裹'维度的广泛分布模式。

发现3:维度调谐轮廓捕捉了脑区的功能选择性。 通过将脑区调谐轮廓与图像维度轮廓匹配,成功识别了各脑区的代表性图像:早期视觉区域(V1-V3)对应精细、多彩、重复的视觉特征;hV4比V1-V3具有更高的颜色选择性;类别选择性区域(FFA、OFA、EBA、PPA、OPA、MPA)的代表性图像与预期类别一致。同一类别内的区域存在差异,如OPA比其它场景选择性区域对'身体部位相关'维度响应更强;FFA和OFA的面部选择性主要由'头部相关'维度的响应幅度驱动,而其余维度调谐高度相似。

发现4:类别选择性区域对行为派生维度呈稀疏调谐。 类别选择性区域(尤其是FFA、OFA、EBA)的编码模型权重稀疏度显著高于非类别选择性区域(如早期视觉皮层呈密集表征)。场景选择性区域(PPA、MPA、OPA)也表现出稀疏性但参与者间变异较大。基于稀疏度图,作者还发现了两个新的候选功能选择性区域:一个位于右侧梭状回前部(对动物面部响应),一个位于眶额皮层(对甜食响应)。

发现5:维度模型优于类别模型预测脑反应。 在直接模型比较中,连续对象维度在解释视觉系统脑反应方面优于类别模型,表明维度相关调谐图比类别中心框架具有更强的解释力。

零结果/意外发现:pSTS在参与者3中未检测到,因此未表现出稀疏性增加。场景选择性区域的稀疏性效应在参与者间变异较大,作者推测可能因为维度是从场景中的物体(而非孤立场景图像)推导的。

Limitations

作者在文中承认的局限包括:

  • 行为相似性嵌入仅基于每个THINGS类别的一张图像训练,可能无法完全捕捉整个图像集的视觉丰富性(作者通过CLIP-ViT微调来缓解这一问题)。
  • 场景选择性区域的稀疏性效应在参与者间变异较大,可能源于维度是从场景中的物体推导的,而非孤立场景图像。
  • 研究仅涉及三名参与者(尽管在独立数据集上验证了结果)。
  • 探索性发现的稀疏调谐区域(如FFA前部区域)需要进一步研究确认其功能。

Key Contributions

  • 首次将大规模行为推导的66个连续对象维度直接映射到全视觉皮层,证明这些维度在整个视觉层级(包括早期视觉皮层)广泛分布表征。
  • 证明行为派生维度能捕捉已知的视觉皮层功能地形(面部、身体、场景、工具、食物等选择性区域),同时发现新的候选功能选择性模式。
  • 提出类别选择性是稀疏维度调谐的特例,而非独立的组织原则,弥合了类别中心框架与连续维度框架之间的鸿沟。
  • 通过直接模型比较证明连续维度模型优于类别模型预测脑反应,为维度框架提供了更强的经验支持。
  • 开发了基于维度调谐轮廓识别脑区代表性图像的高通量方法,可用于数据驱动的功能选择性发现。
  • 利用稀疏度图发现了两个新的候选功能选择性区域(FFA前部区域和眶额皮层),展示了该框架的发现潜力。

Key Claims

"Our results reveal broadly distributed representations of behaviourally relevant information, demonstrating selectivity to a wide variety of novel dimensions while capturing known selectivities for visual features and categories." (Abstract)

"Behaviour-derived dimensions were superior to categories at predicting brain responses, yielding mixed selectivity in much of visual cortex and sparse selectivity in category-selective clusters." (Abstract)

"This framework reconciles seemingly disparate findings regarding regional specialization, explaining category selectivity as a special case of sparse response profiles among representational dimensions, suggesting a more expansive view on visual processing in the human brain." (Abstract)

"In this multidimensional representation, category selectivity stands out as a special case of sparse selectivity to a set of core representational object dimensions, while other parts of visual cortex reflect a more mixed selectivity." (Results, final paragraph of Introduction section)

"A direct model comparison revealed that continuous object dimensions provide a better model of brain responses than categories across the visual system, suggesting that dimension-related tuning maps offer more explanatory power than a category-centric framework." (Results, final paragraph of Introduction section)


My Notes